Micron Document
<!DOCTYPE html>
<html class="client-nojs vector-feature-language-in-header-enabled vector-feature-language-in-main-page-header-disabled vector-feature-page-tools-pinned-disabled vector-feature-toc-pinned-clientpref-0 vector-toc-not-available vector-feature-main-menu-pinned-disabled vector-feature-limited-width-clientpref-1 vector-feature-limited-width-content-enabled vector-feature-custom-font-size-clientpref-1 vector-feature-appearance-pinned-clientpref-0 skin-theme-clientpref-day vector-sticky-header-enabled" lang="de" dir="ltr"><head>
<meta charset="UTF-8">
<title>Hyperparameteroptimierung</title>
<meta name="viewport" content="width=device-width, initial-scale=1.0">
<link rel="icon" type="image/png" href="./_res_/favicon.png">
<link rel="canonical" href="https://de.wikipedia.org/wiki/Hyperparameteroptimierung"> <link href="./_mw_/ext.cite.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.math.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.wikimediamessages.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.icons.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.search.codex.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.styles.css" rel="stylesheet" type="text/css">
<meta name="ResourceLoaderDynamicStyles" content="">
<link href="./_mw_/ext.gadget.citeRef.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.defaultPlainlinks.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonHide.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonLayout.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonStyle.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiDarkmode.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiResponsive.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.specialSearch.css" rel="stylesheet" type="text/css">
<link rel="stylesheet" type="text/css" href="./_mw_/site.styles.css">
<link rel="stylesheet" type="text/css" href="./_mw_/noscript.css">
<link rel="stylesheet" type="text/css" href="./_res_/footer.css">
<link rel="stylesheet" type="text/css" href="./_res_/vector-2022.css">
</head>
<body class="skin--responsive skin-vector skin-vector-search-vue mediawiki ltr sitedir-ltr mw-hide-empty-elt ns-0 ns-subject page-Hyperparameteroptimierung rootpage-Hyperparameteroptimierung skin-vector-2022 action-view">
<div class="mw-page-container">
<div class="mw-page-container-inner">
<div class="mw-content-container">
<main id="content" class="mw-body">
<header class="mw-body-header vector-page-titlebar">
<h1 id="firstHeading" class="firstHeading mw-first-heading"><span class="mw-page-title-main">Hyperparameteroptimierung</span></h1>
</header>
<a id="top"></a>
<div id="bodyContent" class="vector-body ve-init-mw-desktopArticleTarget-targetContainer" aria-labelledby="firstHeading" data-mw-ve-target-container="">
<div id="contentSub">
<div id="mw-content-subtitle"></div>
</div>
<div id="mw-content-text" class="mw-body-content mw-content-ltr" lang="de" dir="ltr"><div class="mw-content-ltr mw-parser-output" lang="de" dir="ltr"><p>Im Bereich des <a href="Maschinelles_Lernen" title="Maschinelles Lernen">maschinellen Lernens</a> bezeichnet <b>Hyperparameteroptimierung</b> die Suche nach optimalen Hyperparametern. Ein Hyperparameter ist ein <a href="Parameter_(Mathematik)" title="Parameter (Mathematik)">Parameter</a>, der zur Steuerung des Trainingsalgorithmus verwendet wird und dessen Wert im Gegensatz zu anderen Parametern vor dem eigentlichen Training des Modells festgelegt werden muss.
</p>

<div class="mw-heading mw-heading2"><h2 id="Ansätze"><span id="Ans.C3.A4tze"></span>Ansätze</h2></div>

<div class="mw-heading mw-heading3"><h3 id="Rastersuche">Rastersuche</h3></div>
<p>Die Rastersuche oder <i>Grid Search</i> ist der traditionelle Weg, nach optimalen Hyperparametern zu suchen. Dabei wird eine <a href="Ersch%C3%B6pfende_Suche" class="mw-redirect" title="Erschöpfende Suche">erschöpfende Suche</a> auf einer händisch festgelegten Untermenge des Hyperparameterraumes des Lernalgorithmus durchgeführt. Eine Rastersuche muss durch eine Performance-Metrik geführt werden, die typischerweise durch <a href="Kreuzvalidierungsverfahren" title="Kreuzvalidierungsverfahren">Kreuzvalidierung</a> auf Trainingsdaten<sup id="cite_ref-1" class="reference"><a href="#cite_note-1"><span class="cite-bracket">[</span>1<span class="cite-bracket">]</span></a></sup> oder nicht beim Training betrachteten Validierungsdaten berechnet wird.<sup id="cite_ref-2" class="reference"><a href="#cite_note-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup>
</p><p>Für reelle oder unbegrenzte Räume einzelner Hyperparameter muss vor der Rastersuche eine <a href="Diskretisierung" title="Diskretisierung">Diskretisierung</a> und Beschränkung auf einen Teil des Raumes festgelegt werden.
</p><p>Ein Beispiel dafür ist die Hyperparameteroptimierung eines <a href="Support_Vector_Machine" title="Support Vector Machine">SVM</a>-<a href="Klassifizierung" title="Klassifizierung">Klassifikators</a> mit einem <a href="Radiale_Basisfunktion" title="Radiale Basisfunktion">RBF</a>-Kernel. Dieser besitzt zwei Hyperparameter, die für eine gute Performance auf ungesehenen Daten justiert werden müssen: eine Regularisierungskonstante <i>C</i> und ein Kernel-Hyperparameter γ. Beide Parameter sind kontinuierlich; daher muss zur Durchführung der Rastersuche eine endliche Menge sinnvoller Werte für jeden Hyperparameter gewählt werden, zum Beispiel:
</p>
<dl><dd><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle C\in \{10,100,1000\}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>C</mi>
<mo>∈<!-- ∈ --></mo>
<mo fence="false" stretchy="false">{</mo>
<mn>10</mn>
<mo>,</mo>
<mn>100</mn>
<mo>,</mo>
<mn>1000</mn>
<mo fence="false" stretchy="false">}</mo>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle C\in \{10,100,1000\}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/4124e15320f26a727f12f02d9bc61edc512878fd.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.838ex; width:19.462ex; height:2.843ex;" alt="{\displaystyle C\in \{10,100,1000\}}" loading="lazy"></span></dd>
<dd><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle \gamma \in \{0.1,0.2,0.5,1.0\}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>γ<!-- γ --></mi>
<mo>∈<!-- ∈ --></mo>
<mo fence="false" stretchy="false">{</mo>
<mn>0.1</mn>
<mo>,</mo>
<mn>0.2</mn>
<mo>,</mo>
<mn>0.5</mn>
<mo>,</mo>
<mn>1.0</mn>
<mo fence="false" stretchy="false">}</mo>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle \gamma \in \{0.1,0.2,0.5,1.0\}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/add7d5ca68cbe82cefb41c6299f04106c03e120f.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.838ex; width:21.417ex; height:2.843ex;" alt="{\displaystyle \gamma \in \{0.1,0.2,0.5,1.0\}}" loading="lazy"></span></dd></dl>
<p>Bei der Rastersuche wird dann eine Support Vector Machine für jedes Paar (<i>C</i>, γ) im <a href="Kartesisches_Produkt" title="Kartesisches Produkt">kartesischen Produkt</a> dieser beiden Mengen trainiert und auf Validierungsdaten bewertet. Abschließend wird von der Rastersuche die Kombination zurückgegeben, die gemäß der gewählten Metrik am besten abschneidet.
</p><p>Die Rastersuche leidet unter dem <a href="Fluch_der_Dimensionalit%C3%A4t" title="Fluch der Dimensionalität">Fluch der Dimensionalität</a>. Die einzelnen Versuche können allerdings parallel ausgeführt werden, da keine Abhängigkeit untereinander besteht.<sup id="cite_ref-bergstra_3-0" class="reference"><a href="#cite_note-bergstra-3"><span class="cite-bracket">[</span>3<span class="cite-bracket">]</span></a></sup>
</p>

<div class="mw-heading mw-heading3"><h3 id="Zufallssuche">Zufallssuche</h3></div>
<p>Bei der Zufallssuche oder <i>Random Search</i> wird anstatt des erschöpfenden Ausprobierens aller Kombinationen eine zufällige Auswahl von Werten innerhalb des vorgegebenen Hyperparameterraumes vorgenommen. Im Gegensatz zur Rastersuche ist keine Diskretisierung des Raumes erforderlich. Die Zufallssuche kann die Rastersuche in Geschwindigkeit und Performance übertreffen, besonders wenn nur eine kleine Anzahl von Hyperparametern die Qualität des Lernalgorithmus beeinflusst.<sup id="cite_ref-bergstra_3-1" class="reference"><a href="#cite_note-bergstra-3"><span class="cite-bracket">[</span>3<span class="cite-bracket">]</span></a></sup> Der Grund hierfür ist, dass bei der Rastersuche für jeden Parameter nur wenige Werte ausprobiert werden (dafür aber mehrfach), während zufällig ausgewählte Werte im Suchraum wesentlich besser verteilt sind.
</p><p>Die Zufallssuche kann ebenfalls parallel ausgeführt werden und bietet zu jedem Zeitpunkt ein vollständiges Ergebnis über den Suchraum, ohne dass Bereiche vernachlässigt wurden. Prozesse können daher zu jeder Zeit hinzugefügt oder abgeschaltet werden.
</p>

<div class="mw-heading mw-heading3"><h3 id="Bayessche_Optimierung">Bayessche Optimierung</h3></div>
<div class="hauptartikel" role="navigation"><span class="hauptartikel-pfeil" title="siehe" aria-hidden="true" role="presentation">→&nbsp;</span><i><span class="hauptartikel-text">Hauptartikel</span>: <a href="Bayes%E2%80%99sche_Optimierung" title="Bayes’sche Optimierung">Bayes’sche Optimierung</a></i></div>
<p><a href="Bayes%E2%80%99sche_Optimierung" title="Bayes’sche Optimierung">Bayes’sche Optimierung</a> ist eine globale Optimierungsmethode für verrauschte <a href="Black_Box_(Systemtheorie)" title="Black Box (Systemtheorie)">Black-Box</a>-Funktionen, die zur Hyperparameteroptimierung ein probabilistisches Surrogatmodell der Funktion zwischen Hyperparameterwerten und der auszuwertenden Metrik auf Validierungsdaten aufbaut.
Dabei werden iterativ Hyperparameterkonfigurationen ausprobiert, die nach dem aktuellen Modell vielversprechend erscheinen, und anschließend das Modell durch die neuen Erkenntnisse angepasst.
Bayessche Optimierung versucht so möglichst viele Beobachtungen über die Funktion zu sammeln, insbesondere über die Lage des Optimums. Sie berücksichtigt gleichzeitig die Erkundung von Bereichen, in denen wenig Wissen über die zu erwartende Performance vorliegt, (<i>Exploration</i>) und die Ausnutzung von Wissen über Bereiche, in denen das Optimum erwartet wird (<i>Exploitation</i>), siehe Exploration-Exploitation Tradeoff.
In der Praxis hat sich gezeigt, dass mit bayesscher Optimierung aufgrund des gesammelten Wissens bessere Ergebnisse als bei der Raster- oder Zufallssuche in weniger Versuchen erzielt werden können.<sup id="cite_ref-4" class="reference"><a href="#cite_note-4"><span class="cite-bracket">[</span>4<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-bergstra11_5-0" class="reference"><a href="#cite_note-bergstra11-5"><span class="cite-bracket">[</span>5<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-snoek_6-0" class="reference"><a href="#cite_note-snoek-6"><span class="cite-bracket">[</span>6<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-thornton_7-0" class="reference"><a href="#cite_note-thornton-7"><span class="cite-bracket">[</span>7<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading3"><h3 id="Gradientenbasierte_Optimierung">Gradientenbasierte Optimierung</h3></div>
<div class="hauptartikel" role="navigation"><span class="hauptartikel-pfeil" title="siehe" aria-hidden="true" role="presentation">→&nbsp;</span><i><span class="hauptartikel-text">Hauptartikel</span>: <a href="Gradientenabstieg" class="mw-redirect" title="Gradientenabstieg">Gradientenabstieg</a></i></div>
<p>Für manche Lernalgorithmen ist es möglich, den Gradienten in Bezug auf die Hyperparameter zu berechnen und sie durch das <a href="Verfahren_des_steilsten_Abstiegs" class="mw-redirect" title="Verfahren des steilsten Abstiegs">Verfahren des steilsten Abstiegs</a> zu optimieren. Die erste Anwendung solcher Techniken fand für <a href="Neuronales_Netz" title="Neuronales Netz">neuronale Netze</a> statt.<sup id="cite_ref-8" class="reference"><a href="#cite_note-8"><span class="cite-bracket">[</span>8<span class="cite-bracket">]</span></a></sup> Später wurden sie auch für andere Modelle wie <a href="Support_Vector_Machine" title="Support Vector Machine">Support Vector Machines</a><sup id="cite_ref-9" class="reference"><a href="#cite_note-9"><span class="cite-bracket">[</span>9<span class="cite-bracket">]</span></a></sup> und <a href="Logistische_Regression" title="Logistische Regression">logistische Regression</a><sup id="cite_ref-10" class="reference"><a href="#cite_note-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup> eingesetzt.
</p><p>Ein anderer Ansatz, Gradienten in Bezug auf Hyperparameter zu erhalten, besteht darin, die Schritte eines iterativen Optimierungsalgorithmus <a href="Automatisches_Differenzieren" title="Automatisches Differenzieren">automatisch zu differenzieren</a>.<sup id="cite_ref-11" class="reference"><a href="#cite_note-11"><span class="cite-bracket">[</span>11<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-abs1502.03492_12-0" class="reference"><a href="#cite_note-abs1502.03492-12"><span class="cite-bracket">[</span>12<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading3"><h3 id="Evolutionäre_Optimierung"><span id="Evolution.C3.A4re_Optimierung"></span>Evolutionäre Optimierung</h3></div>
<div class="hauptartikel" role="navigation"><span class="hauptartikel-pfeil" title="siehe" aria-hidden="true" role="presentation">→&nbsp;</span><i><span class="hauptartikel-text">Hauptartikel</span>: <a href="Evolution%C3%A4rer_Algorithmus" title="Evolutionärer Algorithmus">Evolutionärer Algorithmus</a></i></div>
<p>Bei der evolutionären Optimierung werden <a href="Evolution%C3%A4rer_Algorithmus" title="Evolutionärer Algorithmus">evolutionäre Algorithmen</a> eingesetzt, um nach dem globalen Optimum einer verrauschten Black-Box-Funktion zu suchen.<sup id="cite_ref-bergstra11_5-1" class="reference"><a href="#cite_note-bergstra11-5"><span class="cite-bracket">[</span>5<span class="cite-bracket">]</span></a></sup> Die evolutionäre Hyperparameteroptimierung folgt dabei einem von der <a href="Evolution" title="Evolution">Evolution</a> inspirierten Prozess:
</p>
<ol><li>Erstelle eine initiale Population zufälliger Lösungen (zufällig gewählte Hyperparameterwerte)</li>
<li>Werte die Hyperparameterkonfigurationen aus und bestimme die <a href="Fitnessfunktion" title="Fitnessfunktion">Fitness</a> (beispielsweise die mittlere Performance in zehnfacher Kreuzvalidierung)</li>
<li>Ordne die Hyperparameterkonfigurationen nach ihrer Fitness</li>
<li>Ersetze die am schlechtesten abschneidenden Konfigurationen durch neue, die durch <a href="Rekombination_(evolution%C3%A4rer_Algorithmus)" title="Rekombination (evolutionärer Algorithmus)">Rekombination</a> und <a href="Mutation_(evolution%C3%A4rer_Algorithmus)" title="Mutation (evolutionärer Algorithmus)">Mutation</a> generiert werden</li>
<li>Wiederhole die Schritte 2 bis 4, bis eine zufriedenstellende Performance erreicht wird oder sich die Performance nicht weiter verbessert</li></ol>
<p>Evolutionäre Optimierung wurde zur Hyperparameteroptimierung für statistische Lernalgorithmen,<sup id="cite_ref-bergstra11_5-2" class="reference"><a href="#cite_note-bergstra11-5"><span class="cite-bracket">[</span>5<span class="cite-bracket">]</span></a></sup> automatisiertes <a href="Maschinelles_Lernen" title="Maschinelles Lernen">maschinelles Lernen</a> und die Suche nach Architekturen <a href="Deep_Learning" title="Deep Learning">tiefer neuronaler Netze</a> eingesetzt.<sup id="cite_ref-miikkulainen1_13-0" class="reference"><a href="#cite_note-miikkulainen1-13"><span class="cite-bracket">[</span>13<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-jaderberg1_14-0" class="reference"><a href="#cite_note-jaderberg1-14"><span class="cite-bracket">[</span>14<span class="cite-bracket">]</span></a></sup>
Ein Beispiel für einen evolutionären Optimierungsalgorithmus ist <a href="CMA-ES" title="CMA-ES">CMA-ES</a>.
</p>
<div class="mw-heading mw-heading3"><h3 id="Early-Stopping_basierte_Ansätze"><span id="Early-Stopping_basierte_Ans.C3.A4tze"></span>Early-Stopping basierte Ansätze</h3></div>

<p>Wenn Ressourcen für die Untersuchung des Hyperparameterraumes knapp sind, und während der Hyperparametersuche so alloziert werden sollen, dass keine Ressourcen für schlechte Hyperparameter verschwendet werden, kann mit <a href="Early_Stopping" title="Early Stopping">Early Stopping</a> gearbeitet werden. Algorithmen, die Early Stopping benutzen, sind z.&nbsp;B.:
</p>
<ul><li>Sukzessive Halbierung (successive halving)</li>
<li>Hyperband (Optimierung)</li></ul>
<div class="mw-heading mw-heading2"><h2 id="Einzelnachweise">Einzelnachweise</h2></div>
<ol class="references">
<li id="cite_note-1"><span class="mw-cite-backlink"><a href="#cite_ref-1">↑</a></span> <span class="reference-text">Chin-Wei Hsu, Chih-Chung Chang and Chih-Jen Lin (2010). <a rel="nofollow" class="external text" href="http://www.csie.ntu.edu.tw/~cjlin/papers/guide/guide.pdf">A practical guide to support vector classification</a>. Technical Report, <a href="National_Taiwan_University" class="mw-redirect" title="National Taiwan University">National Taiwan University</a>.</span>
</li>
<li id="cite_note-2"><span class="mw-cite-backlink"><a href="#cite_ref-2">↑</a></span> <span class="reference-text"><cite style="font-style:italic">Ten quick tips for machine learning in computational biology</cite>. In: <cite style="font-style:italic">BioData Mining</cite>. 10. Jahrgang, <span style="white-space:nowrap">Nr.<span style="display:inline-block;width:.2em">&nbsp;</span>35</span>, Dezember 2017, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em">&nbsp;</span>35</span>, <a href="Digital_Object_Identifier" title="Digital Object Identifier">doi</a>:<span class="uri-handle" style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://doi.org/10.1186/s13040-017-0155-3">10.1186/s13040-017-0155-3</a></span>, <a class="external mw-magiclink-pmid" rel="nofollow" href="https://www.ncbi.nlm.nih.gov/pubmed/29234465?dopt=Abstract">PMID 29234465</a>, <a rel="nofollow" class="external text" href="https://www.ncbi.nlm.nih.gov/pmc/articles/PMC5721660/">PMC&nbsp;5721660</a> (freier Volltext).<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.atitle=Ten+quick+tips+for+machine+learning+in+computational+biology&amp;rft.date=2017-12&amp;rft.doi=10.1186%2Fs13040-017-0155-3&amp;rft.genre=journal&amp;rft.issue=35&amp;rft.jtitle=BioData+Mining&amp;rft.pages=35&amp;rft.pmc=5721660&amp;rft.pmid=29234465&amp;rft.volume=10.+Jahrgang" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-bergstra-3"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-bergstra_3-0">a</a></sup> <sup><a href="#cite_ref-bergstra_3-1">b</a></sup></span> <span class="reference-text">James Bergstra, Yoshua Bengio: <cite style="font-style:italic">Random Search for Hyper-Parameter Optimization</cite>. In: <cite style="font-style:italic">Journal of Machine Learning Research</cite>. 13. Jahrgang, 2012, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em">&nbsp;</span>281–305</span> (<a rel="nofollow" class="external text" href="http://jmlr.csail.mit.edu/papers/volume13/bergstra12a/bergstra12a.pdf">mit.edu</a> [PDF]).<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.atitle=Random+Search+for+Hyper-Parameter+Optimization&amp;rft.au=James%26%2332%3BBergstra%2C%26%2332%3BYoshua%26%2332%3BBengio&amp;rft.btitle=Journal+of+Machine+Learning+Research&amp;rft.date=2012&amp;rft.genre=book&amp;rft.pages=281-305&amp;rft.volume=13.+Jahrgang" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-4"><span class="mw-cite-backlink"><a href="#cite_ref-4">↑</a></span> <span class="reference-text">Frank Hutter, Holger Hoos, Kevin Layton-Brown: <cite style="font-style:italic">Sequential model-based optimization for general algorithm configuration</cite>. In: Learning and Intelligent Optimization (Hrsg.): <cite style="font-style:italic">Lecture Notes in Computer Science</cite>. <span style="white-space:nowrap">Band<span style="display:inline-block;width:.2em">&nbsp;</span>6683</span>. Springer, Berlin, Heidelberg 2011, ISBN 978-3-642-25565-6, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em">&nbsp;</span>507–523</span>, <a href="Digital_Object_Identifier" title="Digital Object Identifier">doi</a>:<span class="uri-handle" style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://doi.org/10.1007/978-3-642-25566-3_40">10.1007/978-3-642-25566-3_40</a></span> (<a rel="nofollow" class="external text" href="http://www.cs.ubc.ca/labs/beta/Projects/SMAC/papers/11-LION5-SMAC.pdf">ubc.ca</a> [PDF]).<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.atitle=Sequential+model-based+optimization+for+general+algorithm+configuration&amp;rft.au=Frank+Hutter%2C+Holger+Hoos%2C+Kevin+Layton-Brown&amp;rft.btitle=Lecture+Notes+in+Computer+Science&amp;rft.date=2011&amp;rft.doi=10.1007%2F978-3-642-25566-3_40&amp;rft.genre=book&amp;rft.isbn=9783642255656&amp;rft.pages=507-523&amp;rft.place=Berlin%2C+Heidelberg&amp;rft.pub=Springer&amp;rft.volume=6683" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-bergstra11-5"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-bergstra11_5-0">a</a></sup> <sup><a href="#cite_ref-bergstra11_5-1">b</a></sup> <sup><a href="#cite_ref-bergstra11_5-2">c</a></sup></span> <span class="reference-text">James Bergstra, Remi Bardenet, <a href="Yoshua_Bengio" title="Yoshua Bengio">Yoshua Bengio</a>, Balazs Kegl: <cite style="font-style:italic">Algorithms for hyper-parameter optimization</cite>. In: <cite style="font-style:italic">Advances in Neural Information Processing Systems</cite>. 2011 (<a rel="nofollow" class="external text" href="http://papers.nips.cc/paper/4443-algorithms-for-hyper-parameter-optimization.pdf">nips.cc</a> [PDF]).<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.atitle=Algorithms+for+hyper-parameter+optimization&amp;rft.au=James+Bergstra%2C+Remi+Bardenet%2C+Yoshua+Bengio%2C+...&amp;rft.btitle=Advances+in+Neural+Information+Processing+Systems&amp;rft.date=2011&amp;rft.genre=book" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-snoek-6"><span class="mw-cite-backlink"><a href="#cite_ref-snoek_6-0">↑</a></span> <span class="reference-text">Jasper Snoek, Hugo Larochelle, Ryan Adams: <cite style="font-style:italic">Practical Bayesian Optimization of Machine Learning Algorithms</cite>. In: <cite style="font-style:italic">Advances in Neural Information Processing Systems</cite>. 2012, <a href="ArXiv" title="ArXiv">arxiv</a>:<a rel="nofollow" class="external text" href="https://arxiv.org/abs/1206.2944">1206.2944</a>, <a href="Bibcode" title="Bibcode">bibcode</a>:<a rel="nofollow" class="external text" href="https://ui.adsabs.harvard.edu/abs/2012arXiv1206.2944S">2012arXiv1206.2944S</a> (<a rel="nofollow" class="external text" href="http://papers.nips.cc/paper/4522-practical-bayesian-optimization-of-machine-learning-algorithms.pdf">nips.cc</a> [PDF]).<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.atitle=Practical+Bayesian+Optimization+of+Machine+Learning+Algorithms&amp;rft.au=Jasper%26%2332%3BSnoek%2C%26%2332%3BHugo%26%2332%3BLarochelle%2C%26%2332%3BRyan%26%2332%3BAdams&amp;rft.btitle=Advances+in+Neural+Information+Processing+Systems&amp;rft.date=2012&amp;rft.genre=book" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-thornton-7"><span class="mw-cite-backlink"><a href="#cite_ref-thornton_7-0">↑</a></span> <span class="reference-text">Chris Thornton, Frank Hutter, Holger Hoos: <cite style="font-style:italic">Auto-WEKA: Combined selection and hyperparameter optimization of classification algorithms</cite>. In: <cite style="font-style:italic">Knowledge Discovery and Data Mining</cite>. 2013, <a href="ArXiv" title="ArXiv">arxiv</a>:<a rel="nofollow" class="external text" href="https://arxiv.org/abs/1208.3719">1208.3719</a>, <a href="Bibcode" title="Bibcode">bibcode</a>:<a rel="nofollow" class="external text" href="https://ui.adsabs.harvard.edu/abs/2012arXiv1208.3719T">2012arXiv1208.3719T</a> (<a rel="nofollow" class="external text" href="http://www.cs.ubc.ca/labs/beta/Projects/autoweka/papers/autoweka.pdf">ubc.ca</a> [PDF]).<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.atitle=Auto-WEKA%3A+Combined+selection+and+hyperparameter+optimization+of+classification+algorithms&amp;rft.au=Chris%26%2332%3BThornton%2C%26%2332%3BFrank%26%2332%3BHutter%2C%26%2332%3BHolger%26%2332%3BHoos&amp;rft.btitle=Knowledge+Discovery+and+Data+Mining&amp;rft.date=2013&amp;rft.genre=book" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-8"><span class="mw-cite-backlink"><a href="#cite_ref-8">↑</a></span> <span class="reference-text">Jan Larsen, Lars Kai Hansen, Claus Svarer, M Ohlsson: <cite style="font-style:italic">Design and regularization of neural networks: the optimal use of a validation set</cite>. In: <cite style="font-style:italic">Proceedings of the 1996 IEEE Signal Processing Society Workshop</cite>. 1996.<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.atitle=Design+and+regularization+of+neural+networks%3A+the+optimal+use+of+a+validation+set&amp;rft.au=Jan%26%2332%3BLarsen%2C%26%2332%3BLars+Kai%26%2332%3BHansen%2C%26%2332%3BClaus%26%2332%3BSvarer%2C+...&amp;rft.btitle=Proceedings+of+the+1996+IEEE+Signal+Processing+Society+Workshop&amp;rft.date=1996&amp;rft.genre=book" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-9"><span class="mw-cite-backlink"><a href="#cite_ref-9">↑</a></span> <span class="reference-text">Olivier Chapelle, Vladimir Vapnik, Olivier Bousquet, Sayan Mukherjee: <cite style="font-style:italic">Choosing multiple parameters for support vector machines</cite>. In: <cite style="font-style:italic">Machine Learning</cite>.<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.atitle=Choosing+multiple+parameters+for+support+vector+machines&amp;rft.au=Olivier+Chapelle%2C%26%2332%3BVladimir+Vapnik%2C%26%2332%3BOlivier+Bousquet%2C+...&amp;rft.btitle=Machine+Learning&amp;rft.genre=book" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-10"><span class="mw-cite-backlink"><a href="#cite_ref-10">↑</a></span> <span class="reference-text">Chuong B, Chuan-Sheng Foo, Andrew Y Ng: <cite style="font-style:italic">Efficient multiple hyperparameter learning for log-linear models</cite>. In: <cite style="font-style:italic">Advances in Neural Information Processing Systems 20</cite>.<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.atitle=Efficient+multiple+hyperparameter+learning+for+log-linear+models&amp;rft.au=Chuong+B%2C%26%2332%3BChuan-Sheng+Foo%2C%26%2332%3BAndrew+Y+Ng&amp;rft.btitle=Advances+in+Neural+Information+Processing+Systems+20&amp;rft.genre=book" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-11"><span class="mw-cite-backlink"><a href="#cite_ref-11">↑</a></span> <span class="reference-text">Justin Domke: <cite style="font-style:italic">Generic Methods for Optimization-Based Modeling</cite>. In: <cite style="font-style:italic">Aistats</cite>. 22. Jahrgang, 2012 (<a rel="nofollow" class="external text" href="https://web.archive.org/web/20140124182520/http://jmlr.org/proceedings/papers/v22/domke12/domke12.pdf">jmlr.org</a> (<span class="webarchiv-memento"><a href="Webarchivierung#Begrifflichkeiten" title="Webarchivierung">Memento</a></span> des <style data-mw-deduplicate="TemplateStyles:r250917974">
/* start https://de.wikipedia.org/ */


.mw-parser-output .dewiki-iconexternal>a{background-position:center right!important;background-repeat:no-repeat!important}body.skin-minerva .mw-parser-output .dewiki-iconexternal>a{background-image:url("./_mw_/OOjs_UI_icon_external-link-ltr-progressive.svg")!important;background-size:10px!important;padding-right:13px!important}body.skin-timeless .mw-parser-output .dewiki-iconexternal>a,body.skin-monobook .mw-parser-output .dewiki-iconexternal>a{background-image:url("./_mw_/MediaWiki_external_link_icon.svg")!important;padding-right:13px!important}body.skin-vector .mw-parser-output .dewiki-iconexternal>a{background-image:url("./_mw_/Link.ernal-small-ltr-progressive.svg")!important;background-size:0.857em!important;padding-right:1em!important}


/* end https://de.wikipedia.org/ */
</style><span class="dewiki-iconexternal"><a class="external text" href="https://redirecter.toolforge.org/?url=http%3A%2F%2Fwww.jmlr.org%2Fproceedings%2Fpapers%2Fv22%2Fdomke12%2Fdomke12.pdf">Originals</a></span> vom 24.&nbsp;Januar 2014 im <i><a href="Internet_Archive" title="Internet Archive">Internet Archive</a></i>) [abgerufen am 9.&nbsp;Dezember 2017]).<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.atitle=Generic+Methods+for+Optimization-Based+Modeling&amp;rft.au=Justin%26%2332%3BDomke&amp;rft.btitle=Aistats&amp;rft.date=2012&amp;rft.genre=book&amp;rft.volume=22.+Jahrgang" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-abs1502.03492-12"><span class="mw-cite-backlink"><a href="#cite_ref-abs1502.03492_12-0">↑</a></span> <span class="reference-text">Dougal Maclaurin, David Duvenaud, Ryan P. Adams: <cite style="font-style:italic">Gradient-based Hyperparameter Optimization through Reversible Learning</cite>. 2015, <a href="ArXiv" title="ArXiv">arxiv</a>:<a rel="nofollow" class="external text" href="https://arxiv.org/abs/1502.03492">1502.03492&nbsp;[stat.ML]</a>.<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.au=Dougal+Maclaurin%2C+David+Duvenaud%2C+Ryan+P.+Adams&amp;rft.btitle=Gradient-based+Hyperparameter+Optimization+through+Reversible+Learning&amp;rft.date=2015&amp;rft.genre=book" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-miikkulainen1-13"><span class="mw-cite-backlink"><a href="#cite_ref-miikkulainen1_13-0">↑</a></span> <span class="reference-text">Risto Miikkulainen, Jason Liang, Elliot Meyerson, Aditya Rawal, Dan Fink, Olivier Francon, Bala Raju, Hormoz Shahrzad, Arshak Navruzyan, Nigel Duffy, Babak Hodjat: <cite style="font-style:italic">Evolving Deep Neural Networks</cite>. 2017, <a href="ArXiv" title="ArXiv">arxiv</a>:<a rel="nofollow" class="external text" href="https://arxiv.org/abs/1703.00548">1703.00548&nbsp;[cs.NE]</a>.<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.au=Risto+Miikkulainen%2C+Jason+Liang%2C+Elliot+Meyerson%2C+...&amp;rft.btitle=Evolving+Deep+Neural+Networks&amp;rft.date=2017&amp;rft.genre=book" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-jaderberg1-14"><span class="mw-cite-backlink"><a href="#cite_ref-jaderberg1_14-0">↑</a></span> <span class="reference-text">Max Jaderberg, Valentin Dalibard, Simon Osindero, Wojciech M. Czarnecki, Jeff Donahue, Ali Razavi, Oriol Vinyals, Tim Green, Iain Dunning, Karen Simonyan, Chrisantha Fernando, Koray Kavukcuoglu: <cite style="font-style:italic">Population Based Training of Neural Networks</cite>. 2017, <a href="ArXiv" title="ArXiv">arxiv</a>:<a rel="nofollow" class="external text" href="https://arxiv.org/abs/1711.09846">1711.09846&nbsp;[cs.LG]</a>.<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Hyperparameteroptimierung&amp;rft.au=Max+Jaderberg%2C+Valentin+Dalibard%2C+Simon+Osindero%2C+...&amp;rft.btitle=Population+Based+Training+of+Neural+Networks&amp;rft.date=2017&amp;rft.genre=book" style="display:none">&nbsp;</span></span>
</li>
</ol></div><!--htdig_noindex--><div><div class="zim-footer">
Dieser Artikel wurde von <a class="external text" title="Zuletzt bearbeitet am 2023-12-06" href="https://de.wikipedia.org/wiki/?title=Hyperparameteroptimierung&amp;oldid=239919018">Wikipedia</a> herausgegeben. Der Text ist unter <a class="external text" href="https://creativecommons.org/licenses/by-sa/4.0/deed.de">Creative Commons Attribution-Share Alike 4.0</a> verfügbar, sofern nicht anders angegeben. Für die Mediendateien können zusätzliche Bedingungen gelten.
</div>
</div><!--/htdig_noindex--></div>
</div>
</main>
</div>
</div>
</div>
<script src="./_webp_/webpHandler.js"></script>

</body></html>